Type: concept
Confidence: 0.90
Created: 2026-04-25
Updated: 2026-04-25
Tags: 优化算法深度学习数学机器学习

梯度下降(Gradient Descent)

概述

梯度下降是最基础的优化算法,通过沿损失函数梯度的反方向迭代更新参数,逐步寻找损失的最小值,是所有神经网络训练的核心引擎。与反向传播(Backpropagation)算法配合,共同完成神经网络的训练过程。

关键内容

  1. 基本原理:梯度指向函数增长最快的方向,因此沿梯度的反方向移动可以最快地降低函数值。参数更新公式为:θ ← θ - η∇L(θ),其中η是学习率,∇L(θ)是损失函数的梯度。

  2. 反向传播的关系反向传播负责计算梯度(∂L/∂W),梯度下降负责使用梯度更新参数。两者配合完成一次训练迭代:前向传播 → 计算损失 → 反向传播求梯度 → 梯度下降更新权重。

  3. 变体家族:基础梯度下降使用全量数据计算梯度(Batch GD),计算成本高。随机梯度下降(SGD)每次用一个样本,Momentum(动量)引入惯性加速收敛,Adam(自适应矩估计)结合动量和自适应学习率,RMSProp自适应调整每参数学习率。这些变体构成了现代深度学习优化的工具链。

  4. 反向传播中的作用:在1986年Learning Representations by Back-propagating Errors (1986 论文)中,梯度下降与反向传播结合使用,实现了多层神经网络的有效训练。论文展示了如何通过这种组合解决XOR问题等经典难题。

来源

相关